Appearance
Bridging the grade gap: Reducing assessment bias in a multi-grader class
Summary
Problem: 大型调查课程通常由多名教授或助教评分开放式问题。即使遵循最佳实践,不同评分者对相似水平的学生可能给出差异很大的分数,这源于评分者对同一评分范围的理解不同(即“差异项目功能”或人际不可比性),导致学生因被分配到的评分者不同而受到不公平对待。 Approach: 本文提出使用贝叶斯Aldrich–McKelvey缩放模型,通过让多个评分者共同评分少量“桥接”作业,利用这些共同观察值估计各评分者的截距(严重程度)和权重(评分范围使用程度)参数,进而调整所有学生的分数,消除评分者差异带来的偏差。 Finding: 基于真实课程数据和模拟研究,仅添加一个桥接观察值(即两名评分者各多评一份作业)即可在大多数情况下将排名偏差减半;随着桥接数量增加,偏差持续下降但边际收益递减。即使是最差情况,偏差减少也相当可观。 Significance: 该研究为多评分者课程提供了一种低成本、易实施且可解释的公平评分方法,填补了政治学领域将桥接方法应用于评分实践的空白,并提供了可直接使用的R包和教学材料,有助于推动公平评估实践的普及。
Theoretical Framework
- Theoretical tradition: 该论文属于政治学方法论中的测量理论传统,具体涉及项目反应理论(IRT)和Aldrich–McKelvey缩放模型的应用。
- Prior theories built upon: 论文建立在Aldrich和McKelvey(1977)提出的缩放模型基础上,该模型将个体对刺激的评分视为对潜在真实价值的扭曲感知;同时借鉴了Hare等人(2015)的贝叶斯框架实现,以及政治学中用于处理专家评分不可比性的桥接方法(Bakker et al. 2014; Marquardt and Pemstein 2018; Pemstein, Tzelgov, and Wang 2015)。
- Causal mechanism: 评分偏差源于不同评分者对同一评分范围的理解不同——截距项(αi)反映评分者基线严格程度差异,权重项(βi)反映评分者对评分范围使用宽度的差异。桥接观察值提供了同一学生被多个评分者评分的共同刺激,使模型能够估计并校正这些评分者特定参数,从而将学生分数调整到可比尺度上。
- Key assumptions: 论文明确列出三个关键假设:(1)每个评分者内部评分一致;(2)评分者对高质量与低质量答案的区分标准大致一致;(3)评分者对答案质量的奖励大致呈“线性”关系。作者认为这些假设并不严格,只需弱成立即可保证方法有效。
- Theoretical move: 本文是应用现有理论——将政治学中成熟的Aldrich–McKelvey缩放和桥接方法首次系统性地应用于教育评估场景,并强调在“简单性”与“偏差减少”之间取得平衡,使方法能被统计知识有限的学生理解。
- Scope conditions: 该方法适用于评分者数量有限、每个评分者负责较多学生的大型课程;需要评分者内部一致且对质量判断有基本共识;方法主要针对评分者严重程度差异这一偏差来源,不处理评分者随机误差或教学质量差异导致的偏差。
Research Design
本文采用模拟研究设计,基于真实评分数据进行重复模拟。分析单元是学生个体。关键自变量是桥接观察值的数量(从1到10),因变量是学生排名估计的偏差,操作化为平均绝对误差(MAE)和均方根误差(RMSE),即学生由单一评分者评分的排名与“黄金标准”(三名评分者平均分排名)之间的差异。模型设定为:Gradeij = αi + βiγj + μij,其中γj为学生潜在真实能力,αi为评分者截距(严重程度),βi为评分者权重(评分范围使用),μij为随机误差。模型在贝叶斯框架下估计,使用弱先验(αi∼N(0,30),βi∼N(0,30),γj∼N(0,1)),5条链各运行30,000次迭代,前2,000次为burn-in,每20次抽样一次。
Data & Sample
数据来自美国东北部一所大型私立研究型大学2018年秋季学期的《比较政治学导论》课程,共140名学生、6个复习讨论组、3名助教。每名助教负责评分所有学生的期中考试、一篇5-7页的课程论文和期末考试。所有作业中自由回答和论文式答案占绝大多数分数。学生评估数据已去标识化,获得纽约大学IRB批准(IRB-FY2019-2483)。模拟中重复100次随机选择桥接学生,以评估不同桥接选择下的结果变异性。
Analytical Strategy
主要分析方法是贝叶斯Aldrich–McKelvey缩放模型,在模拟中反复估计以评估不同桥接数量下的偏差减少效果。以三名评分者平均分作为“黄金标准”基线。稳健性检验包括:(1)使用RMSE替代MAE作为结果指标;(2)检验不同作业类型(论文、期末总成绩)和结果格式(字母等级vs排名);(3)检验桥接学生特征(低分、高分或极端分数)是否影响结果;(4)模拟27个数据集覆盖不同评分者可靠性(β)、偏移(α)和误差(μ)组合;(5)变化评分者数量(2-5)、每评分者学生数(12、30、60)和偏差水平;(6)与序数IRT模型(Marquardt and Pemstein 2018)进行比较。
Results & Findings
- 桥接效果显著且即时:传统评分方法下,学生排名平均偏差为22.5个位置(满分135个排名位置),RMSE为27.3。仅添加一个桥接观察值即可在大多数情况下将偏差减半。随着桥接数量增加,偏差持续下降但边际收益递减,中位数改善在桥接数量增加后趋于平缓。
- 偏差来源主要是截距差异:本课程中一名评分者明显比其他两名更严格,但在学生相对排名上与其他评分者高度一致。桥接算法通过截距项立即调整该评分者学生的分数,使偏差减少超过50%。这解释了为何少量桥接就能产生巨大效果——大部分误差来自截距/偏移项(α),而桥接能直接提取这一差异。
- 结果对桥接学生选择不敏感:没有证据表明使用低分、高分或极端分数学生作为桥接会影响性能。
- 模拟结果支持普适性:在27个模拟数据集中,贝叶斯Aldrich–McKelvey模型在所有情况下均优于传统评分方法,唯一例外是评分者完全一致(无偏差)的极限情况。在变化评分者数量、学生数量和偏差水平的模拟中,方法在所有组合下均优于传统方法,且偏差减少幅度随评分者数量、学生数量和参数变异性增加而增大。
- 与IRT模型比较:在中等或严重DIF条件下,序数IRT模型略优于贝叶斯Aldrich–McKelvey模型,但两者与传统方法相比的改进差异远大于两模型之间的差异。
- 意外发现:尽管实施了最佳实践(评分者培训、评分标准讨论、匿名评分),传统评分过程仍产生显著偏差,说明即使遵循最佳实践,多评分者偏差依然存在且不可忽视。
Limitations
作者明确承认三项局限:(1)该方法不能消除所有误差——评分者间仍存在随机因素和难以建模的个人品味差异;(2)算法针对的是评分者属性导致的特定类型偏差,不应期望在所有课堂环境中表现同样好;(3)向不熟悉相关概念的学生沟通这一过程可能具有挑战性,沟通和技术实施是采用该方法的两大主要障碍。此外,论文未处理教学质量差异导致的偏差,仅关注“最小公平定义”——即给定学生答案,分数应独立于评分者分配。
Key Contributions
- 首次将贝叶斯Aldrich–McKelvey缩放模型系统应用于多评分者课程评分场景,证明少量桥接观察值即可大幅降低评分偏差
- 提供实证证据表明,即使遵循最佳评分实践,多评分者偏差仍然显著存在
- 开发并发布R包“bridgR”,灵活实现所提出的方法,支持任意数量的学生、作业和评分者
- 提供教学材料(幻灯片、教师指南),降低方法实施和向学生解释的门槛
- 通过广泛的模拟研究证明方法的普适性和稳健性,覆盖不同数据生成过程和评分者池
- 提出“混合方法”建议:利用算法和教学调整相结合的方式减少偏差
Key Claims
"We introduce an intuitive method for reducing this kind of bias: a Bayesian implementation of the Aldrich–McKelvey scaling model, where multiple graders grade some assignments." (Section 1, Introduction)
"Using real student data from an actual university-level introductory course, we show that even a handful of bridging observations (increasing the workload of graders by less than 10%) can successfully reduce bias by more than 50%." (Section 1, Introduction)
"Adding even one bridging observation (which involves two graders grading one additional student each) halves the bias in the large majority of cases." (Section 5, Results)
"The most important contribution of this paper remains the knowledge that it takes an astonishingly small number of bridging observations to dramatically lower bias stemming from having multiple graders." (Section 6, Discussion and Best Practices)
"This procedure is a vast improvement from doing nothing to reduce this particular form of bias, which we speculate is the norm in many classroom settings." (Section 6, Discussion and Best Practices)